AiNews
⚡ 速览 🧠 模型
← 返回首页

#gpt-5.6 sol

包含标签 "gpt-5.6 sol" 的文章,共 1 篇。

🤖 AI Agent V2EX

GPT-5.6 Sol High/Max实测:重写迁移更值Max

本文作者,Tura-AI/tura 的维护者,对 GPT-5.6 Sol 的 High 和 Max 两种模式进行了非独立评测,旨在探讨 Max 模式是否总是更强,以及其额外提供的搜索、回滚、再试和 agent 回合的价值。评测结合了 DeepSWE v1.1 的记录(包含7个范围明确的修复任务和95个功能实现任务)以及一个 eza 仓库的 Rust 到 Python 行为兼容重写项目(涉及3个 harness)。 核心结论指出,Max 模式并非在所有场景下都优于 High 模式,其价值取决于任务中剩余的不确定性。具体数据如下: 1. **范围明确的修复任务**:High 模式通过率为 64.3%,Max 模式为 57.1%,Max 模式反而下降了 7.1 个百分点,但成本却是 High 模式的 2.53 倍。这表明对于简单、明确的 Bug 修复,Max 模式的额外投入并不划算。 2. **功能实现任务**:Max 模式通过率为 74.6%,略高于 High 模式的 70.2%,提升了 4.4 个百分点,成本为 High 模式的 2.43 倍。在此类任务中,Max 模式的性能提升相对有限,开发者需权衡成本效益。 3. **仓库重写/迁移任务**:Max 模式表现出显著优势,通过率达到 92.3%–94.2%,远高于 High 模式的 78.8%–89.4%,提升了 4.8–13.5 个百分点,成本为 High 模式的 2.27–3.27 倍。对于复杂且不确定性高的代码重写或迁移项目,Max 模式的额外能力(如更深度的搜索和回滚)能带来显著的成功率提升。 总体而言,在 113 个 DeepSWE 任务中,High 模式平均通过率为 69.4%,每任务成本 $3.47;Max 模式平均通过率为 72.7%,每任务成本 $8。 对中国开发者和 AI 创业者而言,这项评测提供了重要的实践指导:在选择 AI 编码助手模式时,应根据任务形态进行智能路由。对于不确定性高、需要大量探索和试错的复杂任务(如代码库重写、跨语言迁移),投资 Max 模式可能带来更高的成功率和效率。而对于边界清晰、复杂度较低的 Bug 修复或功能实现,High 模式可能更具成本效益。这有助于优化 AI 编码工具的使用策略,提升开发效率和资源利用率。